Serveur d'exploration sur la recherche en informatique en Lorraine

Attention, ce site est en cours de développement !
Attention, site généré par des moyens informatiques à partir de corpus bruts.
Les informations ne sont donc pas validées.

Classification et extension automatique d’annotations d’images en utilisant un réseau Bayésien

Identifieur interne : 003861 ( Main/Exploration ); précédent : 003860; suivant : 003862

Classification et extension automatique d’annotations d’images en utilisant un réseau Bayésien

Auteurs : Sabine Barrat [France] ; Salvatore Tabbone [France]

Source :

RBID : ISTEX:5A1B1DD7760D752A6EF4596901BA8FFBB4DC6C57

Descripteurs français

English descriptors

Abstract

Nous proposons, dans cet article, d'améliorer la classification d'images, en utilisant une approche de classification visuo-textuelle (à base de caractéristiques visuelles et textuelles), et en étendant automatiquement les annotations existantes aux images non annotées. L'approche proposée est dérivée de la théorie des modèles graphiques probabilistes et dédiée aux deux tâches de classification et d'annotation d'images partiellement annotées. Nous considérons une image comme partiellement annotée si elle ne possède pas le nombre maximal de mots-clés disponibles par image dans la vérité-terrain. Grâce à leur capacité à fonctionner en présence de données manquantes, un modèle graphique probabiliste a été proposé pour représenter les images partiellement annotées. Ce modèle est basé sur un mélange de lois multinomiales et de mélanges de Gaussiennes. La distribution des caractéristiques visuelles est estimée par des mélanges de Gaussiennes et celle des mots-clés par une loi multinomiale. Par conséquent, le modèle proposé ne requiert pas que toutes les images soient annotées : lorsqu'une image est partiellement annotées, les mots-clés manquants sont considérés comme des valeurs manquantes. De plus, notre modèle peut automatiquement étendre des annotations existantes à des images partiellement annotées, sans l'intervention de l'utilisateur. L'incertitude autour de l'association entre un ensemble de mots-clés et une image est capturée par une distribution de probabilité jointe (définie par un mélange de lois multinomiales et de mélanges de Gaussiennes) sur le dictionnaire de mots-clés et les caractéristiques visuelles extraites de notre collection d'images. De plus, de façon à résoudre le problème de dimensionnalité dû à la grande dimension des caractéristiques visuelles, nous avons adapté une méthode de sélection de variables. Les résultats de la classification visuo-textuelle, obtenus sur une base d'images collectées sur Internet, partiellement et manuellement annotée, montrent une amélioration de 32.3 % en terme de taux de reconnaissance, par rapport à la classification basée sur l'information visuelle uniquement. Par ailleurs, l'extension automatique d'annotations, avec notre modèle, sur des images avec mots-clés manquants, améliore encore la classification visuo-textuelle de 6.8 %. Enfin, la méthode proposée s'est montrée compétitive avec des classificateurs de l'état de l'art.
The rapid growth of Internet and multimedia information has shown a need in the development of multimedia information retrieval techniques, especially in image retrieval. We can distinguish two main trends. The first one, called “text-based image retrieval”, consists in applying text-retrieval techniques from fully annotated images. The text describes high-level concepts but this technique presents some drawbacks: it requires a tedious work of annotation. Moreover, annotations could be ambiguous because two users can use different keywords to describe a same image. Consequently some approaches have proposed to useWordnet in order to reduce these potential ambiguities. The second approach, called “content-based image retrieval” is a younger field. These methods rely on visual features (color, texture or shape) computed automatically, and retrieve images using a similarity measure. However, the obtained performances are not really acceptable, except in the case of well-focused corpus. In order to improve the recognition, a solution consists in combining visual and semantic information. In many vision problems, instead of having fully annotated training data, it is easier to obtain just a subset of data with annotations, because it is less restrictive for the user. This paper deals with modeling, classifying, and annotating weakly annotated images. More precisely, we propose a scheme for image classification optimization, using a joint visual-text clustering approach and automatically extending image annotations. The proposed approach is derived from the probabilistic graphical model theory and dedicated for both tasks of weakly-annotated image classification and annotation. We consider an image as weakly annotated if the number of keywords defined for it is less than the maximum defined in the ground truth. Thanks to their ability to manage missing values, a probabilistic graphical model has been proposed to represent weakly annotated images. We propose a probabilistic graphical model based on a Gaussian-Mixtures and Multinomial mixture. The visual features are estimated by the Gaussian mixtures and the keywords by a Multinomial distribution. Therefore, the proposed model does not require that all images be annotated: when an image is weakly annotated, the missing keywords are considered as missing values. Besides, our model can automatically extend existing annotations to weakly-annotated images, without user intervention. The uncertainty around the association between a set of keywords and an image is tackled by a joint probability distribution (defined from Gaussian-Mixtures and Multinomial mixture) over the dictionary of keywords and the visual features extracted from our collection of images. Moreover, in order to solve the dimensionality problem due to the large dimensions of visual features, we have adapted a variable selection method. Results of visual-textual classification, reported on a database of images collected from the Web, partially and manually annotated, show an improvement of about 32.3% in terms of recognition rate against only visual information classification. Besides the automatic annotation extension with our model for images with missing keywords outperforms the visual-textual classification of about 6.8%. Finally the proposed method is experimentally competitive with the state-of-art classifiers.

Url:
DOI: 10.3166/ts.26.339-352


Affiliations:


Links toward previous steps (curation, corpus...)


Le document en format XML

<record>
<TEI wicri:istexFullTextTei="biblStruct">
<teiHeader>
<fileDesc>
<titleStmt>
<title xml:lang="fr">Classification et extension automatique d’annotations d’images en utilisant un réseau Bayésien</title>
<author>
<name sortKey="Barrat, Sabine" sort="Barrat, Sabine" uniqKey="Barrat S" first="Sabine" last="Barrat">Sabine Barrat</name>
</author>
<author>
<name sortKey="Tabbone, Salvatore" sort="Tabbone, Salvatore" uniqKey="Tabbone S" first="Salvatore" last="Tabbone">Salvatore Tabbone</name>
</author>
</titleStmt>
<publicationStmt>
<idno type="wicri:source">ISTEX</idno>
<idno type="RBID">ISTEX:5A1B1DD7760D752A6EF4596901BA8FFBB4DC6C57</idno>
<date when="2009" year="2009">2009</date>
<idno type="doi">10.3166/ts.26.339-352</idno>
<idno type="url">https://api.istex.fr/ark:/67375/HT0-VJNGX2P7-X/fulltext.pdf</idno>
<idno type="wicri:Area/Istex/Corpus">001492</idno>
<idno type="wicri:explorRef" wicri:stream="Istex" wicri:step="Corpus" wicri:corpus="ISTEX">001492</idno>
<idno type="wicri:Area/Istex/Curation">001475</idno>
<idno type="wicri:Area/Istex/Checkpoint">000967</idno>
<idno type="wicri:explorRef" wicri:stream="Istex" wicri:step="Checkpoint">000967</idno>
<idno type="wicri:doubleKey">0765-0019:2009:Barrat S:classification:et:extension</idno>
<idno type="wicri:Area/Main/Merge">003939</idno>
<idno type="wicri:source">HAL</idno>
<idno type="RBID">Hal:inria-00539035</idno>
<idno type="url">https://hal.inria.fr/inria-00539035</idno>
<idno type="wicri:Area/Hal/Corpus">005815</idno>
<idno type="wicri:Area/Hal/Curation">005815</idno>
<idno type="wicri:Area/Hal/Checkpoint">002E43</idno>
<idno type="wicri:explorRef" wicri:stream="Hal" wicri:step="Checkpoint">002E43</idno>
<idno type="wicri:doubleKey">0765-0019:2009:Barrat S:classification:et:extension</idno>
<idno type="wicri:Area/Main/Merge">003D22</idno>
<idno type="wicri:source">INIST</idno>
<idno type="RBID">Pascal:10-0301318</idno>
<idno type="wicri:Area/PascalFrancis/Corpus">000212</idno>
<idno type="wicri:Area/PascalFrancis/Curation">000807</idno>
<idno type="wicri:Area/PascalFrancis/Checkpoint">000214</idno>
<idno type="wicri:explorRef" wicri:stream="PascalFrancis" wicri:step="Checkpoint">000214</idno>
<idno type="wicri:doubleKey">0765-0019:2009:Barrat S:classification:et:extension</idno>
<idno type="wicri:Area/Main/Merge">003C48</idno>
<idno type="wicri:Area/Main/Curation">003861</idno>
<idno type="wicri:Area/Main/Exploration">003861</idno>
</publicationStmt>
<sourceDesc>
<biblStruct>
<analytic>
<title level="a" type="main" xml:lang="fr">Classification et extension automatique d’annotations d’images en utilisant un réseau Bayésien</title>
<author>
<name sortKey="Barrat, Sabine" sort="Barrat, Sabine" uniqKey="Barrat S" first="Sabine" last="Barrat">Sabine Barrat</name>
<affiliation wicri:level="4">
<orgName type="university">Université Nancy 2</orgName>
<country>France</country>
<placeName>
<settlement type="city">Nancy</settlement>
<region type="region" nuts="2">Grand Est</region>
<region type="old region" nuts="2">Lorraine (région)</region>
</placeName>
</affiliation>
<affiliation wicri:level="1">
<country wicri:rule="url">France</country>
</affiliation>
</author>
<author>
<name sortKey="Tabbone, Salvatore" sort="Tabbone, Salvatore" uniqKey="Tabbone S" first="Salvatore" last="Tabbone">Salvatore Tabbone</name>
<affiliation wicri:level="4">
<orgName type="university">Université Nancy 2</orgName>
<country>France</country>
<placeName>
<settlement type="city">Nancy</settlement>
<region type="region" nuts="2">Grand Est</region>
<region type="old region" nuts="2">Lorraine (région)</region>
</placeName>
</affiliation>
<affiliation wicri:level="1">
<country wicri:rule="url">France</country>
</affiliation>
</author>
</analytic>
<monogr></monogr>
<series>
<title level="j" type="main">Traitement du Signal</title>
<title level="j" type="abbrev">Trait. Signal</title>
<idno type="ISSN">0765-0019</idno>
<idno type="eISSN">1958-5608</idno>
<imprint>
<publisher>Lavoisier</publisher>
<date type="published" when="2009-09">2009</date>
<biblScope unit="vol">26</biblScope>
<biblScope unit="issue">5</biblScope>
<biblScope unit="page" from="339">339</biblScope>
<biblScope unit="page" to="352">352</biblScope>
<biblScope unit="page-count">14</biblScope>
<biblScope unit="ref-count">0</biblScope>
<biblScope unit="fig-count">0</biblScope>
<biblScope unit="table-count">0</biblScope>
</imprint>
<idno type="ISSN">0765-0019</idno>
</series>
</biblStruct>
</sourceDesc>
<seriesStmt>
<idno type="ISSN">0765-0019</idno>
</seriesStmt>
</fileDesc>
<profileDesc>
<textClass>
<keywords scheme="KwdEn" xml:lang="en">
<term>Annotation</term>
<term>Automatic classification</term>
<term>Bayes network</term>
<term>Dictionaries</term>
<term>Dimensionality</term>
<term>Image classification</term>
<term>Internet</term>
<term>Keyword</term>
<term>Missing data</term>
<term>Model theory</term>
<term>Multinomial distribution</term>
<term>Probabilistic model</term>
<term>Probability density function</term>
<term>Signal classification</term>
<term>State of the art</term>
<term>Statistical method</term>
<term>Visual information</term>
</keywords>
<keywords scheme="Pascal" xml:lang="fr">
<term>Annotation</term>
<term>Classification automatique</term>
<term>Classification image</term>
<term>Classification signal</term>
<term>Dictionnaire</term>
<term>Dimensionnalité</term>
<term>Donnée manquante</term>
<term>Etat actuel</term>
<term>Fonction densité probabilité</term>
<term>Information visuelle</term>
<term>Internet</term>
<term>Loi multinomiale</term>
<term>Modèle probabiliste</term>
<term>Mot clé</term>
<term>Méthode statistique</term>
<term>Réseau Bayes</term>
<term>Théorie modèles</term>
</keywords>
<keywords scheme="Wicri" type="topic" xml:lang="fr">
<term>Dictionnaire</term>
<term>Méthode statistique</term>
</keywords>
<keywords scheme="mix" xml:lang="fr">
<term>Bayesian networks</term>
<term>Modèles graphiques probabilistes</term>
<term>Probabilistic graphical models</term>
<term>annotation automatique</term>
<term>classification</term>
<term>image annotation</term>
<term>image classification</term>
<term>réseaux Bayésiens</term>
<term>sélection de variables</term>
<term>variable selection</term>
</keywords>
</textClass>
</profileDesc>
</teiHeader>
<front>
<div type="abstract" xml:lang="fr">Nous proposons, dans cet article, d'améliorer la classification d'images, en utilisant une approche de classification visuo-textuelle (à base de caractéristiques visuelles et textuelles), et en étendant automatiquement les annotations existantes aux images non annotées. L'approche proposée est dérivée de la théorie des modèles graphiques probabilistes et dédiée aux deux tâches de classification et d'annotation d'images partiellement annotées. Nous considérons une image comme partiellement annotée si elle ne possède pas le nombre maximal de mots-clés disponibles par image dans la vérité-terrain. Grâce à leur capacité à fonctionner en présence de données manquantes, un modèle graphique probabiliste a été proposé pour représenter les images partiellement annotées. Ce modèle est basé sur un mélange de lois multinomiales et de mélanges de Gaussiennes. La distribution des caractéristiques visuelles est estimée par des mélanges de Gaussiennes et celle des mots-clés par une loi multinomiale. Par conséquent, le modèle proposé ne requiert pas que toutes les images soient annotées : lorsqu'une image est partiellement annotées, les mots-clés manquants sont considérés comme des valeurs manquantes. De plus, notre modèle peut automatiquement étendre des annotations existantes à des images partiellement annotées, sans l'intervention de l'utilisateur. L'incertitude autour de l'association entre un ensemble de mots-clés et une image est capturée par une distribution de probabilité jointe (définie par un mélange de lois multinomiales et de mélanges de Gaussiennes) sur le dictionnaire de mots-clés et les caractéristiques visuelles extraites de notre collection d'images. De plus, de façon à résoudre le problème de dimensionnalité dû à la grande dimension des caractéristiques visuelles, nous avons adapté une méthode de sélection de variables. Les résultats de la classification visuo-textuelle, obtenus sur une base d'images collectées sur Internet, partiellement et manuellement annotée, montrent une amélioration de 32.3 % en terme de taux de reconnaissance, par rapport à la classification basée sur l'information visuelle uniquement. Par ailleurs, l'extension automatique d'annotations, avec notre modèle, sur des images avec mots-clés manquants, améliore encore la classification visuo-textuelle de 6.8 %. Enfin, la méthode proposée s'est montrée compétitive avec des classificateurs de l'état de l'art.</div>
<div type="abstract" xml:lang="en">The rapid growth of Internet and multimedia information has shown a need in the development of multimedia information retrieval techniques, especially in image retrieval. We can distinguish two main trends. The first one, called “text-based image retrieval”, consists in applying text-retrieval techniques from fully annotated images. The text describes high-level concepts but this technique presents some drawbacks: it requires a tedious work of annotation. Moreover, annotations could be ambiguous because two users can use different keywords to describe a same image. Consequently some approaches have proposed to useWordnet in order to reduce these potential ambiguities. The second approach, called “content-based image retrieval” is a younger field. These methods rely on visual features (color, texture or shape) computed automatically, and retrieve images using a similarity measure. However, the obtained performances are not really acceptable, except in the case of well-focused corpus. In order to improve the recognition, a solution consists in combining visual and semantic information. In many vision problems, instead of having fully annotated training data, it is easier to obtain just a subset of data with annotations, because it is less restrictive for the user. This paper deals with modeling, classifying, and annotating weakly annotated images. More precisely, we propose a scheme for image classification optimization, using a joint visual-text clustering approach and automatically extending image annotations. The proposed approach is derived from the probabilistic graphical model theory and dedicated for both tasks of weakly-annotated image classification and annotation. We consider an image as weakly annotated if the number of keywords defined for it is less than the maximum defined in the ground truth. Thanks to their ability to manage missing values, a probabilistic graphical model has been proposed to represent weakly annotated images. We propose a probabilistic graphical model based on a Gaussian-Mixtures and Multinomial mixture. The visual features are estimated by the Gaussian mixtures and the keywords by a Multinomial distribution. Therefore, the proposed model does not require that all images be annotated: when an image is weakly annotated, the missing keywords are considered as missing values. Besides, our model can automatically extend existing annotations to weakly-annotated images, without user intervention. The uncertainty around the association between a set of keywords and an image is tackled by a joint probability distribution (defined from Gaussian-Mixtures and Multinomial mixture) over the dictionary of keywords and the visual features extracted from our collection of images. Moreover, in order to solve the dimensionality problem due to the large dimensions of visual features, we have adapted a variable selection method. Results of visual-textual classification, reported on a database of images collected from the Web, partially and manually annotated, show an improvement of about 32.3% in terms of recognition rate against only visual information classification. Besides the automatic annotation extension with our model for images with missing keywords outperforms the visual-textual classification of about 6.8%. Finally the proposed method is experimentally competitive with the state-of-art classifiers.</div>
</front>
</TEI>
<affiliations>
<list>
<country>
<li>France</li>
</country>
<region>
<li>Grand Est</li>
<li>Lorraine (région)</li>
</region>
<settlement>
<li>Nancy</li>
</settlement>
<orgName>
<li>Université Nancy 2</li>
</orgName>
</list>
<tree>
<country name="France">
<region name="Grand Est">
<name sortKey="Barrat, Sabine" sort="Barrat, Sabine" uniqKey="Barrat S" first="Sabine" last="Barrat">Sabine Barrat</name>
</region>
<name sortKey="Barrat, Sabine" sort="Barrat, Sabine" uniqKey="Barrat S" first="Sabine" last="Barrat">Sabine Barrat</name>
<name sortKey="Tabbone, Salvatore" sort="Tabbone, Salvatore" uniqKey="Tabbone S" first="Salvatore" last="Tabbone">Salvatore Tabbone</name>
<name sortKey="Tabbone, Salvatore" sort="Tabbone, Salvatore" uniqKey="Tabbone S" first="Salvatore" last="Tabbone">Salvatore Tabbone</name>
</country>
</tree>
</affiliations>
</record>

Pour manipuler ce document sous Unix (Dilib)

EXPLOR_STEP=$WICRI_ROOT/Wicri/Lorraine/explor/InforLorV4/Data/Main/Exploration
HfdSelect -h $EXPLOR_STEP/biblio.hfd -nk 003861 | SxmlIndent | more

Ou

HfdSelect -h $EXPLOR_AREA/Data/Main/Exploration/biblio.hfd -nk 003861 | SxmlIndent | more

Pour mettre un lien sur cette page dans le réseau Wicri

{{Explor lien
   |wiki=    Wicri/Lorraine
   |area=    InforLorV4
   |flux=    Main
   |étape=   Exploration
   |type=    RBID
   |clé=     ISTEX:5A1B1DD7760D752A6EF4596901BA8FFBB4DC6C57
   |texte=   Classification et extension automatique d’annotations d’images en utilisant un réseau Bayésien
}}

Wicri

This area was generated with Dilib version V0.6.33.
Data generation: Mon Jun 10 21:56:28 2019. Site generation: Fri Feb 25 15:29:27 2022